DeepSeek NSA 稀疏注意力
NSA(Native Sparse Attention,原生稀疏注意力)是 DeepSeek 于 2025 年 2 月提出的稀疏注意力机制,核心价值是让稀疏注意力在训练和推理阶段保持一致,从而在长上下文场景显著降本增效。
解决的核心问题
传统稀疏注意力常见的痛点是训练与推理割裂:训练时用稠密注意力、推理时才切稀疏,导致推理阶段模型能力下降。NSA 的「Native(原生)」正指它在训练阶段就以稀疏形态参与,训练推理统一,避免能力损失。
三个「同时」
| 维度 | NSA 的做法 |
|---|---|
| 训练 vs 推理 | 同一套稀疏机制贯穿训练与推理,不产生能力落差 |
| 预填充 vs 解码 | 同时作用于 prefill(预填充)与 decode(解码)阶段,兼顾长文摘要与长代码输出 |
| 架构兼容 | 与 GQA、MQA 等高效注意力架构兼容,可叠加降本 |
效果(64K 上下文)
- 后向传播(训练反向)速度提升约 6 倍
- 前向传播速度提升约 9 倍
- 解码速度提升约 11.6 倍
- 长上下文推理成本显著下降,且推理任务性能不降反升
定位
NSA 属于 DeepSeek 在「模型架构创新」上的一环,与 MLA(省 KV 显存)、MoE(省激活算力)互补:MLA/MoE 优化的是「算什么、存什么」,NSA 优化的是「注意力算多少」。
⚠️ 时效:数据来自 2025-05 第三方综述文章,具体倍数以官方论文/仓库为准。
延伸
- 模型总览见 DeepSeek
- 配套的训练/推理工具见 DeepSeek 开源周五大工具
- 来源剪藏:CSDN 原文(访问于 2026-07-17)